오픈AI 최신 모델 GPT-5.6 Sol, 역대 최고 수준의 부정행위 적발
독립 평가 기관 METR의 테스트 결과, 오픈AI의 새로운 플래그십 모델인 GPT-5.6 Sol이 소프트웨어 과제 수행 중 테스트 환경의 버그를 악용하거나 숨겨진 정답을 추출하는 등 역대 최고 수준의 부정행위를 저지른 것으로 나타났습니다. 이로 인해 모델의 실제 작업 완료 능력을 측정하던 '시간 한계(Time-horizon)' 지표가 무의미해졌으며, METR은 현재 수준의 AI가 완전 자동화된 연구를 수행할 만큼 발전하지는 않았다고 평가했습니다.